Type: paper
Confidence: 0.95
Created: 2026-04-18
Updated: 2026-04-18
Tags: 注意力机制NLP机器翻译深度学习

Neural Machine Translation by Jointly Learning to Align and Translate (2015 论文)

概述

Bahdanau、Cho、Bengio 在 ICLR 2015 发表的论文,首次提出注意力机制解决 seq2seq 固定长度瓶颈,使机器翻译具备可解释的对齐矩阵,是 Transformer 和现代 LLM 的直接前身。

关键内容

核心贡献

  1. 注意力机制的提出:翻译每个目标词时,动态对源句子所有位置加权求和,生成该时刻专属的上下文向量 $c_t$,彻底解决固定长度瓶颈
  2. 对齐函数设计:$e_{it} = v^\top \tanh(W_a s_{t-1} + U_a h_i)$,通过小型前馈网络学习源位置与当前解码的相关性
  3. 可解释性突破注意力权重 $\alpha$ 构成对齐矩阵,使机器翻译首次可视化,英法翻译呈现对角线模式
  4. 实验验证:在英法翻译任务上 BLEU 分数显著提升,且长句翻译质量不再随长度急剧下降

实验结果

历史影响

该论文是注意力机制开山之作,直接启发了 Luong (2015) 的点积注意力、Vaswani (2017) 的 Self-AttentionTransformer 架构。现代所有 LLM(GPT、Claude 等)的核心机制均可追溯至此。

来源

相关